Agent 推理范式总览
这四个不是互斥的 Agent 架构,而是四种可组合的 Reasoning / Agent Design Pattern。它们的划分维度是:控制流管在哪一层。
Agent 推理范式总览
阅读提示 这是 Plan-and-Execute / Reflexion / Self-Ask / ToT 四篇笔记的索引与横向对照页。 想看某个范式的完整机制和坑,点进对应笔记;想快速回忆区别,看本页表格。
核心概念 这四个不是互斥的 Agent 架构,而是四种可组合的 Reasoning / Agent Design Pattern。它们的划分维度是:控制流管在哪一层。
一、四者速查
| 概念 | 核心思想 | 管哪一层 | 适合场景 |
|---|---|---|---|
| Plan-and-Execute | 先制定计划,再逐步执行 | 任务序列 | 长任务、多步骤工程任务 |
| Reflexion | 执行后反思错误,再改进重试 | 失败回路 | 需要自我纠错的 Agent |
| Self-Ask | 不断向自己提出子问题,逐个回答 | 问题分解 | 多跳推理、知识问答 |
| ToT | 同时探索多条思路,选择更好的分支 | 候选搜索 | 复杂推理、搜索型问题 |
二、放在同一个任务里理解
Plan-and-Execute 先决定:我要做哪些事情
Self-Ask 遇到问题:我还需要回答哪些子问题
ToT 遇到难题:有哪些不同思路可以尝试
Reflexion 做完发现错了:刚才哪里出了问题一个高级 Agent 可能同时用上四种:
读图顺序:自上而下是一次任务的正向流程,右侧橙色虚线是 Reflexion 的经验回流——它把失败教训送回 Planner,触发重新规划。左侧标注的是每一层各自控制什么。
三、怎么选:三个判断问题
💡 选型决策 问自己缺的是什么:
你缺的是 用哪个 步骤(不知道要做哪几件事) Plan-and-Execute 信息(知道要做什么,但事实不够) Self-Ask(+ 检索) 思路(有信息,但不知道哪条路对) ToT 修正(做完了但结果不对) Reflexion 这四个问题彼此独立,所以四个范式可以叠加使用,不用二选一。
四、共同的工程前提
四篇笔记里反复出现同一个主题,值得单独记住:
⚠️ 信号的质量决定范式的上限
- Plan-and-Execute 靠执行观察决定要不要推翻旧计划 → 观察不到真实结果,重规划就是瞎改
- Reflexion 靠 Evaluator 给出的反馈驱动 Self-Reflection 写出有用的反思 → Evaluator 只说「错了」,反思就只能写「下次注意」
- Self-Ask 靠检索/来源校验中间答案 → 不校验就会错误放大
- ToT 靠 Evaluator 决定剪谁 → 未校准的打分等于随机剪枝
优先接确定性信号(测试、编译器、检索结果、规则校验),少让 LLM 给自己打分。
注意 Reflexion 那一行的分工:Evaluator 负责评价并给出反馈,Self-Reflection 才负责把反馈写成语言化的教训,两者是不同组件,别合成一个(详见 Reflexion 反思式自我纠错)。
另外,「四个范式都是反馈循环」这个概括并不成立——只有 Reflexion 和 Plan-and-Execute 里的重规划算真正的反馈回路;Self-Ask 是串行分解,ToT 是搜索,它们中间那一步是评估或检索,不构成「拿结果去修正上一次产出」的闭环。四者共同依赖的是信号质量,不是共用同一种控制结构。
五、复习重点
复习重点
- 四者不互斥,是可组合的设计模式,划分维度是控制流管在哪一层。
- 记忆口诀:缺步骤→Plan,缺信息→Self-Ask,缺思路→ToT,缺修正→Reflexion。
- 串行 vs 并行:Self-Ask 是串行拆解(一条路往前推),ToT 是铺开多条候选再选优(结构上并行,工程上不必并发)。
- 四者共同的命门是信号质量,确定性信号永远优先于 LLM 自评。但别把四者都概括成「反馈循环」——只有 Reflexion 和重规划是闭环,Self-Ask 是分解、ToT 是搜索。
- Reflexion 的三个角色别混:Actor(执行)、Evaluator(评价并给反馈)、Self-Reflection(把反馈写成语言教训)。
四篇详细笔记:Plan-and-Execute 先规划再执行|Reflexion 反思式自我纠错|Self-Ask 自问自答多跳推理|ToT 思维树